iT邦幫忙

2026 iThome 鐵人賽

DAY 24
0
IT Operation

給決策者的 30 堂 AI 素養課系列 第 24 篇

【Day 24】控制的層次

  • 分享至 

  • xImage
  •  

你已經決定哪些事不能交給 AI 決定了,但它是被「交代」不要做,還是根本「做不到」。
Day 23 的簽字擋得住的,是送到人面前的那幾件。還有一些事,要讓它從一開始就做不到。
畫完線之後,多數公司做的第一件事是把線寫進提示詞:不得對外寄送客戶資料、金額超過十萬要先問人。寫完,那條線看起來就守住了。

規定寫了、人也審了,為什麼還是出事

一個處理客戶信件的 agent,讀得到客戶寄進來的信,查得到內部的客戶資料,能更新資料,也能把信寄出去。規定寫得很清楚:客戶資料只能寄到那位客戶留在檔案裡的信箱。流程上也設了人審,寄出前要有人按核准。
某一天,一封看起來是那位客戶寄來的信說換了聯絡信箱,請幫忙更新;信的末尾接著寫,麻煩把過去三年的往來紀錄整理成附件寄過來。它先更新了檔案,再照著檔案上的地址把附件寄了出去。人審那一關看到的是它自己寫的一行摘要:更新客戶聯絡方式、回覆客戶查詢。兩個動作分開看都很正常,按了核准。

規定的字面沒有被違反。它寄出去的那個地址,確實就是檔案裡的地址,只是那筆檔案是三十秒前它自己照著信裡的話改的。

規定和人審,是三層防線裡的前兩層,第三層是架構。前兩層擋的東西不一樣,失效的原因也不一樣。

第一層失效的原因有兩種,Day 17 講過其中一種。OWASP 的《代理式應用十大風險》(OWASP Top 10 for Agentic Applications 2026)寫得很白:agent 沒辦法可靠地分出哪些是指令、哪些只是相關內容。你的規定和信裡夾的那句話,對它是同一種東西。

另一種不需要有人攻擊你,Day 18 那句話在這裡有第二種形狀。今年五月,美、英、澳、加、紐五國的資安機關聯合發布的《謹慎採用代理式 AI 服務》(Careful adoption of agentic AI services)指引寫,agent 可能用開發者沒預料到的方式達成目標;誤解人給的意圖也是常見的風險,任務交代得含糊,它做出來的事就會偏離預期。

Day 17 說過控制的方式:OWASP 的《LLM 應用十大風險》(OWASP Top 10 for LLM Applications 2026)把「在提示詞裡限制它的角色與能力」標成部分控制,攻擊者推得出你的提示詞就繞得過去,要跟權限控制一起用才算數。這不是說規定沒用。那份聯合指引把「明確寫出不准做什麼的規則」和「硬性限制,例如拒絕清單、API 層的安全政策」並排放在同一節。規定是這三層的第一層,不能省,也不能是唯一的一層。
第二層是人,也是 Day 23 的主題。這裡補上一件事:**確認不是只有靠人。**動作偏離了原本交代的任務,OWASP 給的確認方式是三種並列:人核准、政策引擎,或平台層的護欄(guardrail),這一類可以分流,不必每次都找人。但動作本身高衝擊或收不回來,框架兩份清單都直接指名要人核准。人力要省在前一種,留給後一種。
第三層是架構,也就是今天要講的那一層。它只有兩句話,每一句都是一個決定。

**決定動作能不能做的那個角色,不能是 AI。**OWASP 的建議寫得很直接:授權要實作在程式邏輯裡,不要靠 LLM 自己判斷這個動作准不准;權限分離、授權邊界檢查這類關鍵控制不能交給模型,要用確定性、可稽核的方式執行。AI 想做什麼,跟 AI 做得到什麼,要由兩個不同的角色決定。回到前面那封信:規定說只能寄到檔案裡的地址,但決定檔案裡有什麼的,也是它。一條規定如果靠某份資料才算數,那份資料就不能由被這條規定管的那個角色來改。

不讓那三個條件在同一個位置同時成立。Day 17 講過的致命三要素(lethal trifecta),讀得到不可信的內容、碰得到敏感資料、能對外送出(OWASP 把改變狀態的動作也算進最後這一類)。怎麼解?拆掉它們共存的那個位置。讀外部來信的那個 agent,不給它改客戶檔案的權限;客戶主檔要改,交給人來做。拆的是同一個位置上的組合,不是整個系統的能力。但拆完還有一件事:寄信那一步只能指定寄給哪位客戶,地址由系統自己去主檔查,不接受讀過那封信的那一段直接給一個地址。不然你只是把同一條路徑切成兩半,那句話照樣傳得過去。

🤿 深水區:拆掉一個條件之後,剩下的要做什麼 OWASP 引了一條經驗法則當底線(Meta 提出的 Rule of Two):把「讀得到不可信輸入」「碰得到敏感資料」「能改變狀態或對外通訊」三項同時具備視為高風險。三項全中的 agent,每一個動作都要人核准;只中兩項的組合不會因此變安全,而是要明文做一份殘餘風險評估。拆掉一項不是免死金牌,是把「每個動作都要人批」換成「剩下的風險你打算怎麼辦」。

對經營者意味著什麼:架構不是把人拿掉,是決定人要看多少

你可能會想,三個條件拆開了,是不是就不用人審了。不會。

Day 23 講過,審核的人被量淹沒本身就是一種威脅。所以拆條件是為了讓人審那一關還有效:你少送一千件到他面前,他才看得完剩下的那十件。架構層決定的,是人要看的量,和人看到的是什麼。

所以這三層不是三選一。OWASP 在提示注入那一條的防護建議開頭就寫,這些控制要當縱深防禦來用,因為沒有任何單一控制是足夠的。要決定的是這三層各擋什麼,以及下一筆錢要加在哪裡。

NIST 的 AI 風險管理框架(AI RMF)把這件事寫成一條管理項:風險處置的優先順序,依影響、可能性和可用資源來排(MANAGE 1.2);另一條還提醒,算資源時要把「有沒有不用 AI 的替代做法」一起算進去(MANAGE 2.1)。翻成白話:這是預算題。下一筆錢加在哪一層,只有你拍得了。

還有一筆錢,買了架構也省不掉。OWASP 對「人被 agent 牽著走」那一條的建議裡,有三件是給人的:給人看的風險摘要要用白話,不要用模型自己生成的理由;要有一條路讓人回報可疑行為;負責監督的人要持續訓練,不只是上線前教一次。

回頭看開場那封信:人審看到的,是它自己寫的一行摘要。提示注入那一條的建議也寫,送到審核的人面前的,要是實際會執行的那個動作,不是摘要。所以值得回去看一眼:你們審核畫面上的那行字,是系統照實際動作產生的,還是 AI 自己寫的?

要拿走的問題

  • 執行層(CTO/資安):上一次我們擋下一個 AI 不該做的動作,是靠規定、靠人看到,還是它根本做不到?
  • 經營層(董事會/CEO):我的下一筆錢,要加在哪一層防線上?
    一句話帶走:要的是做不到,不是不該做。

不過這三層你設計得了的,都只到自己家的邊界為止。


參考連結


上一篇
【Day 23】收不回來的動作,誰有權說不?
下一篇
【Day 25】合約沒寫到的部分,怎麼管?
系列文
給決策者的 30 堂 AI 素養課 共 26 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言